寻找最新最佳的AI 视频人工智能。浏览最全面的AI数据库,每日持续更新。
最新
HOMIE 是一个以人和物体为中心的视频个性化模型,用于生成包含人物和物体的个性化视频。它通过多模态认知增强,在处理复杂人机物组合与交互的同时保持主体一致性。
该项目面向参考到视频生成场景,即人物、物体或人物与物体组合需要在生成运动中保持可识别性。其演示展示了主体内部与主体之间的组合、物体交互,以及建立在开放视频生成基础之上的个性
SANA-Video 2.0 是 NVIDIA 的一项研究项目,采用混合线性注意力和注意力残差实现高效视频生成。它面向最高 720p 的高质量视频,同时降低全 Softmax 注意力带来的延迟和扩展成本。
该模型使用 Hybrid Linear-Softmax Attention,并通过周期性 softmax 锚点和 Block
FLUX 3 是 Black Forest Labs 的多模式模型系列,适用于图像、视频、音频和动作预测工作流程。它被定位为跨越多种模式的一个模型,强调现实细节、风格控制和生产用例。
模型页面重点介绍了 FLUX 3 Video 功能、草稿和正常模式、生产采用以及跨模式改进,其中每种模式相互帮助。它专为需要生成在不同类型媒体上保持
ShotPlan 是一个电影化视频生成框架,可让文生视频模型显式控制硬切、柔性转场和定时相机运动。它允许用户指定镜头结构和转场帧,而不是仅依赖模型从文本中推断电影节奏。
该方法向预训练视频扩散 Transformer 注入可学习的规划 token,并为其分配带小数时间位置的 RoPE 编码。这些 token 会在去噪过程中引导模型
ID-V2V 是 Eyeline Labs 推出的身份保持型视频重风格化框架,可在保持人物身份和表演稳定的同时,对源视频施加场景、光照和风格变化。它面向那些即使在大幅视觉编辑下也必须保留面部相似度、表情、视线和口型同步的制作场景。
该方法将编辑驱动的合成与源驱动的身份保持解耦。它利用重光照面部区域、面部法线图、编辑关键帧和深度序列
Seedance 2.5 是字节 Seed 推出的视频生成模型,用于创建更长的叙事片段,并具备更强的提示遵循、镜头连续性和面向制作的控制能力。它面向需要从文本和视觉参考中获得电影化运动、角色一致性以及灵活场景调度的创作者。
该模型聚焦参考感知生成与编辑,使用户能够比基础文生视频流程更精确地控制风格、主体身份、镜头行为和场景变化。其
ShadowDancer 是一个视频世界模型研究项目,通过从同步影子对中学习统一的动态表示,让单一模型掌握多种不同动作。它将动态与外观分离,因此可把动作迁移到新的视觉世界中。
该方法构建影子对,执行跨影子预测,并使用块因果世界模型支持动作可控的 rollout。示例涵盖人体动作、战斗风格运动、相机控制和机器人操作,展示了跨多类动态
Motion4Motion 是一个免训练的动作迁移框架,可将源视频中提取的动作用于驱动目标主体的动画。它不依赖共享骨架,而是建模稠密运动流,因此可以在人体、动物甚至类物体角色等拓扑差异很大的主体之间进行迁移。
该方法建立在冻结的 WAN 文生视频扩散 Transformer 之上。它使用 Grounded SAM-2 采样源锚点并
Wan-Dancer 是 Tongyi Lab 推出的分层音乐到舞蹈视频生成框架,可根据音乐和参考图像生成长时、连贯的舞蹈视频。它旨在突破许多视频扩散系统在时长上的限制,能够生成超过一分钟的 720p、30 FPS 高清舞蹈视频。
该系统将生成过程拆分为全局关键帧规划和局部时间细化,并利用完整音乐轨道来保持长程结构。它加入时间映射
MobileWan 是 Qualcomm AI Research 的一个项目,旨在把 5B 规模的视频扩散模型带到内存受限的移动硬件上。它从 Wan2.2-5B 出发,目标是在设备端实现高质量视频生成,而不是假设移动部署必须依赖更小、质量更低的模型。
该系统将扩散 Transformer 重构为一种循环式、分块自回归过程,具备近乎
DomainShuttle 是一种以主体为驱动的文生视频生成方法,用于自由形式的开放域个性化。它能在保持身份一致性、运动质量和电影级细节的同时,将同一主体带入真实与想象中的不同世界。
该项目展示了跨域视频个性化能力,包括从真实到奇幻、从奇幻到真实,以及混合域交互。它还展示了同域个性化,包括人物与物体交互、多物体生成和多人生成。</
OmniDirector 是一个相机运动克隆系统,用于对参考视频中的源图像进行动画处理,包括多镜头相机运动,无需交叉配对训练数据。它的目标是动态摄像机运动、多镜头过渡、场景概括和特殊摄像机技术。
该方法通过根据空 3D 空间中的参考摄像机姿势渲染的摄像机网格来表示摄像机运动。在训练期间,该相机网格与其他控件一起注入到 MMDiT
LTX-2 Trainer 是 Lightricks 的 LTX-2 音频-视频生成模型的训练和微调包。它提供了用于 LoRA 训练、全面微调以及跨视频、音频和联合音视频工作流程的灵活调节的工具和脚本。
该软件包涵盖文本到视频、文本到音频、图像到视频、视频扩展、音频扩展、视频修复、音频修复、视频修复、IC-LoRA 参考、音频到
PermaVid 是一个一致的视频生成框架,旨在跨时间、视点变化和编辑操作保持场景持久性。它解决了早期视频上下文中的内存在全局或本地编辑后可能会过时的问题。
该方法使用解缠结的多模态上下文记忆,其中包含用于语义外观的 RGB 库和用于几何结构的深度库。编辑感知内存更新和检索使生成器能够传播新的外观,同时在更改后保留稳定的几何形状
StreamForce 是一个流式视频生成框架,允许用户在视频生成过程中施加并修改物理力。它从单张图像出发,支持对局部推动和风等全局效应进行因果控制,让运动操控变成交互式过程,而非完全预设脚本。
该方法聚焦于通过连续力输入实现物理上更合理的控制。页面展示了全局和局部力控制、实时交互、下落与弹跳、质量感知运动、摩擦感知运动,以及生成
MilliVid 是一种围绕层级潜变量构建的长上下文视频生成方法,旨在实现长程一致性。它解决了传统扩散模型在生成大量帧时会快速形成过长 Transformer 序列、难以实用的问题。
该方法预训练一个层级自动编码器,将每帧压缩为多个 token 层级,然后通过由粗到细的 rollout 生成视频。与扁平潜表示相比,这让模型能在更紧
Flex4DHuman 是一种灵活的多视角视频扩散方法,用于 4D 人体重建。它仅依赖相对相机位姿条件、无需显式几何先验,就能将单目或稀疏多视角的动态人物视频转成同步的稠密多视角视频。
生成出的稠密多视角视频可进一步提升为动态 4D Gaussian splats,使该系统成为视频扩散与可重建 4D 人体资产之间的桥梁。页面链接了
SCAIL-2 是一个可控角色动画框架,可将驱动序列中的动作迁移到参考角色,而无需依赖骨架图或掩码等中间表示。它直接以驱动视频潜变量作为条件输入到潜空间视频扩散模型中,有助于保留仅依赖骨架管线容易丢失的视觉信息。
系统通过端到端的上下文内条件设计,统一了单角色动画、多角色动画、角色替换和零样本动画。项目页面介绍了特定模式的 RoP
Pantheon360是一种3D感知的360度视频扩散模型,专为数字孪生生成而设计,具有全景覆盖、精确的摄像机控制和时空一致性。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 Pantheon360 并不是提供通用演示,而是针对具体的能力差距,为用户提供一种更可控的方式来处理复杂的人工智能
InstructAV2AV是一种指令引导的音视频联合编辑系统,旨在使用自然语言指令编辑语音、外观、对象和视听实例。它的重点是通过将特定于任务的模型设计与研究人员、开发人员或生产团队可以使用的输出相结合,使该工作流程更加实用。 InstructAV2AV 不是提供通用演示,而是针对具体的能力差距,并为用户提供一种更可控的方式来处理复杂的人工智能生成或人工